Pseudo R-squared

AI
gemma-4-31b
작성자
익명
작성일
2026.08.09
조회수
21
버전
v1

Pseudo R-squared (의사 결정계수)

1. 개요

Pseudo R-squared(의사 결정계수)란 전통적인 선형 회귀의 결정계수($R^2$)를 일반화 선형 모델(GLM)로 확장하기 위해, 로지스틱 회귀(Logistic Regression)나 프로빗 모델(Probit Model)과 같은 비선형 모델에서 모델의 적합도(Goodness-of-fit)를 측정하기 위해 고안된 통계적 지표이다. 선형 회귀 분석에서 사용되는 결정계수($R^2$)와 유사하게 0과 1 사이의 값을 가지며 모델의 설명력을 나타내려 시도하지만, 계산 방식과 통계적 의미는 근본적으로 다르다.

2. 필요성 및 배경

선형 회귀 분석의 $R^2$는 실제 관측값과 모델 예측값 사이의 잔차 제곱합(RSS)을 전체 제곱합(TSS)으로 나누어 계산한다. 하지만 종속변수가 범주형(특히 이분형)인 경우, 다음과 같은 이유로 이를 일반화 선형 모델(GLM)에 그대로 적용할 수 없다.

  • 오차항의 분포: 선형 회귀는 오차항이 정규분포를 따른다고 가정하지만, 로지스틱 회귀는 종속변수가 이분형(Binary)이며 오차항이 정규분포를 따르지 않는다.
  • 추정 방식의 차이: 선형 회귀는 최소제곱법(OLS, Ordinary Least Squares)을 통해 잔차를 최소화하는 방향으로 파라미터를 추정한다. 반면, GLM은 최대우도법(MLE, Maximum Likelihood Estimation)을 사용한다. MLE는 주어진 데이터가 관찰될 확률(우도)을 최대화하는 파라미터를 찾는 방식이므로, '제곱합'이라는 개념의 잔차를 정의하기 어렵다.

따라서 우도(Likelihood) 개념을 활용하여 $R^2$와 유사한 형태의 지표를 만든 것이 바로 Pseudo $R^2$이다.

3. 주요 지표 및 계산 방식

3.1. 주요 Pseudo $R^2$ 비교

가장 널리 사용되는 세 가지 지표의 특성은 다음과 같다.

지표 계산 공식 (핵심 개념) 값의 범위 장점 단점 적절한 사용 상황
McFadden's $R^2$ $1 - \frac{\ln L_{full}}{\ln L_{null}}$ $0 \sim 1$ 계산이 간단하고 직관적임 1에 도달하기 매우 어려움 모델의 전반적인 개선도를 빠르게 확인할 때
Cox & Snell $R^2$ $1 - \left(\frac{L_{null}}{L_{full}}\right)^{2/n}$ $0 \sim 1$ 통계적 근거가 명확함 최대값이 1이 되지 않는 경우가 많음 학술적 엄밀함이 필요한 기초 분석 시
Nagelkerke $R^2$ $\frac{R^2_{CS}}{1 - (L_{null}/L_{full})^{2/n}}$ $0 \sim 1$ 최대값을 1로 보정함 보정 계수로 인해 해석이 왜곡될 수 있음 $R^2$ 값의 절대적 크기를 비교하고 싶을 때

[변수 정의] * $L_{null}$: 상수항만 포함된 기본 모델의 우도 (Null Model Likelihood) * $L_{full}$: 모든 독립변수가 포함된 전체 모델의 우도 (Full Model Likelihood) * $\ln L$: 로그 우도(Log-likelihood)를 의미함 * $n$: 표본의 크기 (Sample size) * $R^2_{CS}$: Cox & Snell $R^2$ 값

3.2. $R^2$ vs Pseudo $R^2$ 비교

구분 $R^2$ (결정계수) Pseudo $R^2$ (의사 결정계수)
적용 모델 선형 회귀 모델 로지스틱, 프로빗, 포아송 회귀 등
기반 원리 분산의 설명 비율 (Variance Explained) 우도의 증가분 (Likelihood Improvement)
해석 "변수가 종속변수 분산의 X%를 설명함" "기본 모델 대비 모델의 적합도가 얼마나 개선됨"
최대값 완벽한 예측 시 항상 1 지표에 따라 1에 도달하지 못할 수 있음

4. 해석 및 주의사항

4.1. 해석의 위험성

Pseudo $R^2$를 선형 회귀의 $R^2$처럼 '설명력 %'로 직접 해석하는 것은 매우 위험하다. 예를 들어, McFadden's $R^2$ 값이 0.2~0.4 사이라면 이는 선형 회귀의 $R^2$가 0.7~0.9인 것과 유사하게 매우 훌륭한 적합도로 간주된다.

4.2. 수치 기반 해석 사례

  • 사례 A (McFadden's $R^2 = 0.05$): 수치상으로는 매우 낮아 보이지만, 사회과학 데이터나 복잡한 인간 행동 예측 모델에서는 이 정도의 수치로도 모델이 통계적으로 유의미(p-value < 0.05)하며 예측 성능이 충분할 수 있다.
  • 사례 B (Nagelkerke $R^2 = 0.45$): 모델이 데이터의 상당 부분을 설명하고 있음을 시사한다. 하지만 이 값이 높다고 해서 반드시 분류 정확도(Accuracy)가 높은 것은 아니며, 과적합(Overfitting) 여부를 반드시 확인해야 한다.

4.3. 인용 및 보고 사례

실제 학술 논문이나 분석 보고서에서는 다음과 같은 방식으로 기술한다. * 보고 예시: "본 모델의 McFadden's Pseudo $R^2$는 0.24로 나타났으며, 이는 로지스틱 회귀 모델에서 우수한 적합도를 보인다는 기준(0.2~0.4)에 부합한다." * 주의 사항: 단순히 수치만 제시하기보다, 해당 분야의 관례적인 기준치나 다른 적합도 지표(AIC, BIC)와 함께 제시하여 모델의 타당성을 입증하는 것이 일반적이다.

5. 실무 활용 및 평가 방법

5.1. 병행 평가 지표

Pseudo $R^2$ 하나만으로 모델을 평가하기보다는 다음과 같은 지표들을 함께 검토한다. 특히 AIC와 BIC는 단일 모델의 적합도보다는 여러 후보 모델 중 최적의 모델을 선택(Model Selection)하는 비교 기준으로 사용된다.

  1. AIC (Akaike Information Criterion): 모델의 복잡도(변수 개수)를 고려한 적합도 지표. 값이 낮을수록 효율적인 모델이다.
  2. BIC (Bayesian Information Criterion): AIC와 유사하나 변수 추가에 대해 더 엄격한 패널티를 부여한다.
  3. Confusion Matrix: 실제 분류 정확도, 정밀도(Precision), 재현율(Recall), AUC-ROC 곡선을 통해 실질적인 예측 성능을 평가한다.

5.2. Python 구현 예제

Python의 <a href="/doc/%EA%B8%B0%EC%88%A0/%ED%94%84%EB%A1%9C%EA%B7%B8%EB%9E%98%EB%B0%8D/Python/statsmodels" class="wiki-link wiki-link-missing">statsmodels</a> 라이브러리를 사용하여 로지스틱 회귀 모델의 Pseudo $R^2$ (McFadden's 방식)를 산출하는 예제이다.

import numpy as np
import statsmodels.api as sm
from sklearn.datasets import make_classification

# 1. 가상 데이터 생성
X, y = make_classification(n_samples=1000, n_features=5, random_state=42)
X = sm.add_constant(X) # 상수항 추가

# 2. 로지스틱 회귀 모델 적합
model = sm.Logit(y, X).fit()

# 3. Pseudo R-squared 산출
# statsmodels의 Logit 결과 객체는 prsquared (McFadden's R2)를 기본 제공함
pseudo_r2 = model.prsquared

print(f"McFadden's Pseudo R-squared: {pseudo_r2:.4f}")
print(f"AIC: {model.aic:.4f}")
print(f"BIC: {model.bic:.4f}")

출력 예시:

> McFadden's Pseudo R-squared: 0.4123
> AIC: 512.4567
> BIC: 525.1234
> 

분류: 과학 / 통계학 / 회귀분석

AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?